一起来看一下成品:
准备工具
Codex https://chatgpt.com/c/
nanobanan pro/nanobanan 2 https://labs.google/fx/tools/flow/
Midjourney https://www.midjourney.com/imagine
即梦seedmusic https://jimeng.jianying.com/ai-tool/
倘若不知道模型怎么使用,可以参考这个教程(https://www.super-i.cn/info-2796.html),与本教程一起使用
https://www.flowpix.club/bj/36500.html?token=6f9b4fa664102a0afd5040f6c672af92
第一步:先分析参考视频
开始制作前,我先找了一些风格接近的参考视频(点击即可下载)。
../assets/attachments/参考视频-524c80683859.rar
这一步不能只告诉Codex“做得高级一点”,因为“高级”并不是一个具体的画面要求。我需要说明自己真正想保留的内容:
可以这样向Codex表达:
请分析我提供的参考视频,重点判断它的镜头长度、景别变化、运镜方式、快慢节奏、光影和整体氛围。我要制作一支时尚短片,保留参考片中的快切、轻微手持、变焦和动态模糊,但不要照搬具体内容。请先给我几个简单的剧本方向。

第二步:先做简略剧本
参考片分析完成后,我让Codex先生成一版简略剧本。
这一阶段不需要马上写出每一秒的复杂动作,先确定影片的大体走向即可。例如AI会给你几个方向。

你可以选择一个你喜欢的方向。
比如我就选了:方向二
第三步:制作女主角与服装
剧本方向确定后,我开始制作女主角。
女主角的提示词也是codex给的,直接和他说:
先给我女主角的形象提示词,符合Midjourney的提示词结构,要高级感的外国人。先不用给配饰,服装也不用穿太多,这张图是主图,要白底的定妆照造型

提示词如下:
professional full-body model casting photograph on a pure white background, one 27-year-old European female fashion model, tall slender balanced proportions, angular oval face, defined cheekbones, straight narrow nose, gray-green almond-shaped eyes, natural full eyebrows, pale neutral skin with subtle freckles and realistic skin texture, dark brown hair slicked back into a precise low bun, minimal natural makeup, calm neutral expression, looking directly at the camera, relaxed upright posture, shoulders level, arms naturally resting beside her body, long elegant hands, wearing a simple fitted black sleeveless tank top and plain black straight-leg trousers, barefoot, no layered clothing, no jewelry, no accessories, complete figure centered in frame, feet fully visible, straight-on front view, eye-level camera, pure white seamless cyclorama background, clean high-key studio lighting, soft even illumination across the face and body, faint natural contact shadow beneath the feet, neutral white balance, accurate anatomy, clear facial features, realistic skin and hair, high-resolution digital fashion casting photography, clean unretouched appearance --ar 9:16 --stylize 50 --chaos 0 --quality 1 --no jewelry, accessories, shoes, logos, text, watermark, props, furniture, crowd

人物图片使用Midjourney生成。第一张人物图没有直接加入胶片颗粒、漏光或复杂环境,而是先制作白底定妆照。这样更方便后续进行换装、制作三视图和保持人物一致性。

人物确定后,我又找了一套适合影片气质的服装,并将女主角替换成这套造型。

先将服装提取出来(使用image2.0),提示词如下:
提取画面中的一整套服装鞋子,配饰,至白底图上,只保留服装,不要人物

随后将服装替换到自己的模特上(使用nanobanan pro生成):
图1人物穿上图2的所有服装与配饰,呈现松弛感,
最终穿搭包括浅黄色针织上衣、浅蓝色阔腿裤、花卉丝巾和米色帽子,整体轻盈、柔和,适合湖畔初夏的场景。

为了减少后续生成时的人物变化,我还制作了:
-
面部正面、侧面和四分之三侧面图(使用nanobanan pro生成);
提示词如下:
生成人物的面部三视图,正面,半侧面,纯侧面,灰色背景,超清画质。光线只使用干净统一的摄影棚三点式打光:正左侧主光,正右侧辅助光,后右侧轮廓光。不要杂乱光效,不要彩色灯光,不要强氛围特效。背景为纯净灰色无缝影棚背景。皮肤白一些

-
身体正面、侧面和背面图(使用nanobanan pro生成);
提示词如下:
生成人物的全身图,正面,侧面,背面,灰色背景,超清画质。光线只使用干净统一的摄影棚三点式打光:正左侧主光,正右侧辅助光,后右侧轮廓光。不要杂乱光效,不要彩色灯光,不要强氛围特效。背景为纯净灰色无缝影棚背景。裁切掉头部离开画面,只留下身体

第四步:根据服装完善分镜与场景
服装生成后,就要继续完善分镜
浅黄色针织与浅蓝色阔腿裤则更适合阳光、湖水、象牙白建筑和植物树影。
因此,我将最终服装再次交给Codex,让它根据服装颜色、材质和气质继续完善分镜,并提供场景提示词。
这是最终确定的女主角和服装。请根据服装的颜色、材质和整体气质完善分镜。场景需要与人物穿搭协调,同时包含人物特写、近景、中景、远景和空镜。整体保持湖畔静奢、自然光影和适度胶片质感。

随后让AI继续给你场景提示词(没有复杂的说法,只需要让Codex依据分镜生成场景提示词就行):

场景一(使用Midjourney生成)|
empty refined European lakeside promenade, late spring afternoon, warm ivory limestone walkway, curved cream stucco architecture, pale aqua-blue water, slim muted sage-green railing, sparse olive trees and soft ornamental grasses, elegant Riviera resort atmosphere, clean geometry, generous negative space, warm side-back sunlight, long delicate shadows, quiet understated luxury, airy and relaxed, refined 35mm fashion-film look, fine natural grain, restrained warm halation, gentle highlight bloom, soft optical sharpness, preserved shadow detail, clean film scan --ar 9:16 --v 8.2 --stylize 100 --chaos 0 --seed 13927 --no people figures mannequins vehicles boats birds furniture signs text logos watermark CGI HDR oversharpened

场景二(使用Midjourney生成)|
empty elegant lakeside walking corridor, curved cream stucco wall on the left, warm ivory limestone pavement, pale blue water on the right, slender muted sage-green railing, soft olive-tree shadows falling across the walkway, long clean perspective, subtle breeze, bright but gentle late-afternoon sunlight, light European resort luxury, airy quiet atmosphere, refined 35mm color-negative film aesthetic, fine organic grain, subtle warm halation, soft highlights, clear stone and water textures, clean film scan --ar 9:16 --v 8.2 --stylize 100 --chaos 0 --seed 13927 --no people figures mannequins vehicles boats birds furniture signs text logos watermark CGI HDR oversharpened

场景三(使用Midjourney生成)|临水停留平台
empty semicircular lakeside terrace, pale ivory limestone floor, broad warm cream stucco wall behind the standing area, slim aged-brass and muted sage railing, calm pale aqua water, distant hazy shoreline, one sparse olive tree casting delicate shadows, uncluttered horizon, low side-back sunlight, fresh and elegant Riviera fashion atmosphere, quiet summer luxury, refined 35mm film look, fine natural grain, restrained highlight bloom, soft optical rendering, balanced contrast, preserved detail, clean film scan --ar 9:16 --v 8.2 --stylize 100 --chaos 0 --seed 13927 --no people figures mannequins vehicles boats birds furniture signs text logos watermark CGI HDR oversharpened

第五步:分别编写首帧和动态提示词
我的视频制作方法不是直接用一句提示词生成整支视频,而是先生成每个镜头的首帧,再将首帧制作成视频。
因此,我提前把制作方法告诉Codex,让它针对每段分镜分别提供两种描述:
-
人物与场景融合后的首帧画面描述;
-
这张首帧动起来之后的图生视频描述。
可以使用下面的表达方式:
我的制作流程是先将人物与场景融合,生成每段分镜的首帧,然后使用图生视频让画面动起来。请为每个镜头分别提供首帧画面描述和动态视频描述。首帧需要明确人物位置、景别、姿态、视线、构图和光线;动态描述需要明确人物动作、镜头方向、速度、手持幅度、变焦方式和结束状态。

部分首帧描述

部分视频提示词
第六步:融合生成首帧,再制作动态视频
首帧画面描述准备好以后,把人物参考图与场景图融合,生成每个镜头真正使用的首帧。
我在生成首帧时会同时提供四部分内容:
-
女主角的面部三视图;
-
女主角的身体与服装三视图;
-
当前镜头对应的场景图;
-
Codex根据分镜编写的首帧画面描述。
- 画面色彩质感提示词

色彩质感提示词可以用我的这一段:
法式湖畔度假静奢电影质感,使用 ARRIFLEX 435 35mm胶片摄影机、Cooke S4镜头、Kodak Vision3 250D胶片拍摄。初夏傍晚侧逆光,奶油黄、雾霾蓝、暖象牙白与鼠尾草绿配色,画面轻盈通透,光影清晰,留白充足。细腻胶片颗粒,轻微暖色光晕,柔和高光;针织、丝巾、缎面阔腿裤和草编材质真实清晰。首帧稳定,无动态模糊,竖屏9:16。
画面内容部分用上一步推导出的画面描述即可
然后点击生成
如此生成所有分镜即可。

让首帧动起来
首帧确认后,我再将它交给可灵 3.0 Omni,并使用Codex提前写好的动态画面描述生成视频。

第七步:剪辑与配乐
所有动态镜头生成完成后,我开始按照最初的分镜脚本进行剪辑。

最终成片约32秒,包含约20个镜头。
导出初稿,用真实剪辑反推音乐
音乐没有在最开始制作,而是在画面基本剪完后才开始生成。
如果先制作音乐,画面可能被迫迁就音乐;先完成初剪,才能知道真正的镜头切点、快切位置、留白段落和结尾长度。
我先导出一份视频初稿,再交给Codex分析:
这是我剪辑完成的视频,我现在要制作音乐,分析一下视频节奏,帮我想一下合适的音频提示词

以下是Codex给的音频提示词:
A 32-second instrumental fashion film score at 100 BPM, refined Mediterranean quiet-luxury mood, organic downtempo electronica blended with minimal jazz harmony. Begin immediately with dry tactile percussion, muted wood clicks, soft rim shots and short plucked bass accents, precisely matching the rapid fashion-detail cuts during the first 3 seconds. At 3 seconds, release into warm Rhodes chords, restrained electric bass and a light airy analog pad. Thin the percussion around 7 seconds for the empty olive-tree shadow shot, then bring back three crisp rhythmic accents between 8.8 and 10.7 seconds. From 10.7 to 19.8 seconds, create a spacious and relaxed passage with sustained chords and very sparse percussion. Add three precise tactile clicks around 19.9, 20.5 and 21.2 seconds for the bag-detail cuts. After 21.8 seconds, gradually remove the beat, leaving a delicate two-note motif, warm Rhodes and luminous analog ambience. Open the sound slightly at 28.9 seconds for the final wide lakeside shot, ending at 32 seconds with a soft, elegant, clean chord and natural decay. Sunlit, relaxed, tactile, understated, cinematic, editorial, subtle analog warmth, controlled dynamic range. No vocals, no lyrics, no EDM drop, no epic strings, no tropical house, no lounge saxophone, no sentimental piano, no heavy bass, no busy melody.
直接使用即梦 seedmusic去生成音频

得到音乐后,将音频与视频重新组合。

最后导出
视频生成执行卡
把这节课压缩成一张可执行卡片:看重点、照步骤、避坑,再复制模板直接开做。
这节课不是先追求炫技成片,而是围绕「用 Codex 统筹一支 AI 时尚短片」先把主体、动作、镜头和节奏稳住。
按原文节奏走最稳:先吃透「准备工具」,再把「第一步:先分析参考视频」定住,接着处理「第二步:先做简略剧本」;最后用「第三步:制作女主角与服装」收口。
- 先把「准备工具」里的主体和动作定死。
- 围绕「第一步:先分析参考视频」只取局部结构,别整张照搬。
- 做完「第二步:先做简略剧本」后,先查连贯性和穿帮。
- 按「第三步:制作女主角与服装」去统一气质,不要只改表面。
- 按「第四步:根据服装完善分镜与场景」去统一气质,不要只改表面。
- 把「第五步:分别编写首帧和动态提示词」整理成可复制版本,后面直接复用。
不要一上来就生成最终片;先拆镜头、定主体和运动,再逐段生成,否则容易跳轴、穿帮、节奏混乱。
检查主体是否稳定;镜头运动是否明确;前后画面是否连贯;节奏是否服务主题;是否有明显变形或穿帮。
请围绕「用 Codex 统筹一支 AI 时尚短片」帮我做一个可直接执行的方案。 我的目标是:【填写你的具体目标】 我的素材/产品/角色信息是:【填写已有素材和限制】 请输出:核心创意、分镜表、每个镜头的画面描述、视频生成提示词、剪辑顺序和成片自检清单。要求主体稳定、动作明确、镜头连贯。